Meta 推出首个实时音频感知模型 Muse Voice Transcribe,开发者可通过 Meta Model API 调用,定价每 1000 分钟音频 3 美元。该模型整合流式语音识别、说话人分离与端点检测,支持 20 余名说话者分轨,覆盖 70 余种语言,并引入自适应延迟机制。截至 9 月 1 日,该模型位列 Artificial Analysis 流式语音转文本排行榜第 1 名。